agent 入门
agent 是什么
Agent 是一个能够“感知环境、思考决策、调用工具、执行动作、根据结果继续行动”的程序
和普通聊天机器人不同,普通聊天机器人通常是:
用户输入 -> 模型回答
Agent则是
目标 -> 思考 -> 行动 -> 观察结果 -> 再思考 -> 再行动 -> 直到完成任务
举个例子。
你普通问 LLM:
帮我查一下北京明天天气,并写一封邮件提醒老板。
但 Agent 可以:
- 调用天气工具查北京天气
- 得到结果:晴,26 度
- 调用邮件工具发送邮件
- 告诉你已完成
所以,Agent 的核心不是“更会聊天”,而是:
能拆解任务、能调用工具、能根据反馈继续执行
Agent 的基本组成
一个完整 Agent 通常包括五个部分
Agent = 大模型 + 目标 + 工具 + 记忆 + 执行循环
1. 大模型:Agent 的大脑
LLM 负责:
- 理解用户目标
- 拆解任务
- 决定下一步调用什么工具
- 总结结果
常见模型:
-
OpenAI GPT
-
Anthropic Claude
-
Qwen
-
DeepSeek
-
GLM
-
Kimi
-
本地模型,如 Llama、Qwen 等
2. 目标:Agent 要完成什么
比如
帮我调研 3 个 AI Agent 开源框架,并写成 markdown 报告
目标必须清晰,否则 Agent 会不知道什么时候停止
3. 工具:Agent 的手和脚
工具可以是:
-
搜索网页
-
读取文件
-
写入文件
-
执行 Python 代码
-
查数据库
-
调 API
-
发邮件
-
操作浏览器
-
控制电脑
-
调用其他模型
没有工具的 Agent 只能“想”
有工具的 Agent 才能“做”
4. 记忆:Agent 的经验
记忆分两种
短期记忆
当前任务过程中的上下文。 例如:
用户让我查天气
我已经查到了北京天气
下一步应该写邮件
长期记忆
跨任务保存的知识
例如
用户喜欢简洁回答
用户的项目使用 Python
用户公司名称是 XXX
长期记忆可以用:
文件
数据库
向量数据库
JSON
SQLite
5. 执行循环:Agent 的核心发动机
最经典的循环是:
Thought: 思考下一步 Action: 选择工具 Action Input: 给工具参数 Observation: 观察工具结果 ... Final Answer: 最终回答
这个模式叫 Reasoning + Acting
ReAct (Reasoning and Acting): 一种将“思考”和“行动”紧密结合的范式,让智能体边想边做,动态调整。 Plan-and-Solve: 一种“三思而后行”的范式,智能体首先生成一个完整的行动计划,然后严格执行。 Reflection: 一种赋予智能体“反思”能力的范式,通过自我批判和修正来优化结果。
本文为博主原创文章,未经博主允许不得转载